메뉴

#추론 가속

MP
MarkTechPost • 9일 전
IMP 6

눈축스 AI, 학습 불필요한 저비트 어텐션 커널 'VC-Attention' 공개

눈축스(Nunchux) AI가 영상 확산 트랜스포머(DiT)를 가속화하는 학습 없이 사용 가능한 저비트 어텐션 커널 'VC-Attention'을 공개했습니다. 이 기술은 밸류(value) 양자화 오류와 느린 소프트맥스 단계라는 두 가지 문제를 동시에 해결합니다. 별도 재학습 없이 기존 모델에 적용할 수 있다는 점에서 영상 생성 추론 속도 최적화에 실용적인 의미가 큽니다.

영상 생성 확산 모델 어텐션
MP
MarkTechPost • 36일 전
IMP 6

리퀴드 AI, 최대 3.18배 빠른 디코딩 LFM2.5-DSpark 드래프트 모델 공개

Liquid AI가 약 3억 파라미터(300M) 규모의 드래프트 모델 3종 'LFM2.5-DSpark'를 공개했습니다. 이 모델들은 LFM2.5에 스페큘러티브 디코딩(speculative decoding)을 적용해 최대 3.18배 빠른 디코딩 속도를 제공하면서도 그리디(greedy) 출력 결과는 기존 모델과 완전히 동일합니다. 추론 비용 절감과 지연시간 단축이 중요한 실무 관점에서 주목할 만한 릴리스입니다.

추론 가속 스페큘러티브 디코딩 LFM2.5